Type: concept
Confidence: 0.90
Created: 2026-04-26
Updated: 2026-04-26
Tags: 注意力机制深度学习缩放机制机器学习

Scaled Dot-Product Attention

概述

一种具体的注意力计算方法,通过点积计算查询和键的相似度,并除以键向量维度的平方根进行缩放,是 Transformer 中使用的基础注意力机制

关键内容

  1. 计算公式
  2. Attention(Q, K, V) = softmax(QK^T / sqrt(d_k)) V
  3. 包括四个步骤:计算相似度、缩放、归一化、加权求和

  4. 缩放目的

  5. 当 d_k 较大时,点积结果可能变得很大
  6. 导致 softmax 函数进入梯度极小的饱和区域
  7. 除以 sqrt(d_k) 稳定点积方差,确保梯度有效传播

  8. 应用场景

  9. 作为 Multi-Head Attention 的基础组件
  10. 在编码器自注意力、解码器掩码自注意力编码器-解码器交叉注意力中使用
  11. Transformer 架构的核心计算单元

来源

相关